Type: entity
Confidence: 0.90
Created: 2026-04-26
Updated: 2026-04-26
Tags: 论文自然语言处理深度学习变压器架构AI工程

Attention Is All You Need

概述

Google Brain 团队于 2017 年发表的开创性论文,提出了完全基于注意力机制Transformer 架构,彻底改变了序列建模领域,奠定了现代大语言模型的基础。

关键内容

  1. 论文背景
  2. 作者:Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin
  3. 发表时间:2017 年 NeurIPS 会议
  4. 解决问题:RNN/LSTM 的顺序计算瓶颈和 CNN 在捕捉长距离依赖方面的局限

  5. 核心创新

  6. 完全抛弃循环和卷积结构,仅使用注意力机制
  7. 提出缩放点积注意力Scaled Dot-Product Attention
  8. 引入多头注意力Multi-Head Attention)机制
  9. 使用位置编码Positional Encoding)保留序列信息
  10. 实现高度并行化的训练过程

  11. 架构特点

  12. 编码器-解码器结构,各包含 6 层
  13. 每层包含多头自注意力和前馈网络
  14. 使用残差连接层归一化
  15. 模型基础维度 d_model = 512

来源

相关